第 07 章 · 第二步:看懂界面

第07章 知识库与资料导入

新项目怎么起步、已有项目的资料怎么搬进来?这一章把五种导入方式全部讲透,照着做就能让 AI 真正"认识你的生意"。

阅读约 24 分钟 新手友好 重点:5 种导入方式 含 4 个附录

你将学会

一、先记住一句话:AI 答得准不准,八成取决于你喂了什么

很多人对 AI 的失望,来自一个误解——以为它"什么都知道"。它其实不知道你的业务。它不知道你的产品叫什么、卖给谁、价格多少、竞品是谁、你公司盖章要走几道流程。这些只有你能告诉它。

核心结论:先喂资料,再谈自动化

系统里有一套叫 RAG 的机制,简单说就是"先翻你的资料,再开口回答"。它翻的就是知识库。你往知识库里放什么,AI 的脑子里就有什么;你什么都不放,它就只会说漂亮但正确的废话。

所以正确顺序永远是:先把资料喂够 → 再让 AI 干活。反过来做(先跑起来再补资料),AI 会先产出一堆偏题的内容,你还得逐条返工,反而更贵。

系统给了你五条"喂资料"的通道。它们不是互相替代,而是各有各的场景。先看这张总览表,后面九节逐个讲透。

导入方式 最适合什么 入口在哪 详见
① 知识库直接上传 手上已经整理好的文档,想让它进入 AI 的"长期记忆" 左侧一级菜单 知识库 本章第三节
② 边缘客户端 资料散在你电脑各个文件夹里,不想一个个手动挑 装在自己电脑上的小工具(托盘图标) 本章第四节
③ 会议记录导入 周会 / 复盘 / 客户沟通的纪要,想变成知识,还想变成任务 项目内 研究与获客 › 会议导入 本章第五节
④ 已有项目整体导入 项目已经在跑了,有历史资料、有聊天记录,想整体接手 项目内 建项与定义 › AI 问答 › 项目导入 本章第六节
⑤ 引导建项(对话补充) 新项目从零起步,用聊天的形式把背景、目标、约束讲清楚 项目内 建项与定义 › AI 问答 › 引导建项 本章第七节
⑥ AI 对话附件 临时问一个文件里的问题,不想长期入库 左侧一级菜单 AI 对话 输入框的曲别针 本章第三节末尾 +
附录 B
前五种的区别,一句话记住

①是"往书架上放书",②是"让人上门帮你搬书",③是"把开会的录音转成笔记再变任务",④是"接手一家已经在营业的店",⑤是"开一家新店前先把想法聊清楚"。第六种是"临时借用一本参考书,看完就还",不进书架。

二、先搞懂知识库:公司级 vs 项目级

知识库是本系统里 AI 的"长期记忆"。它不是一个乱堆文件的文件夹,而是分层的——分两层,公司级和项目级。搞清这一层关系,后面所有操作都会顺。

知识库页在哪,长什么样

左侧一级菜单 › 知识库(/kb)

页面顶部有两个页签:知识库 和 RAG 检索。默认停在「知识库」。这个页签里,标题写着一句话——分层知识库(公司级 → 项目级),右上角是 新建知识库 按钮。

第一步永远是选公司

如果你还没在右上角的公司切换器里选公司,页面会显示 请先在顶部选择公司,新建知识库 按钮也是灰的、点不动。这不是 bug,是系统在提醒你:知识库必须归属到一家公司名下。先选公司,再回来。

新建知识库:五个字段逐条讲

点 新建知识库,弹出标题为「新建知识库」的窗口。里面只有五个字段,但每一个都会影响 AI 后面能查到什么。

字段 必填 界面提示(原文) 填错了/不填会怎样
名称 是 如:产品知识库 / 公司制度库(最长 255 字) 不填点「创建」会报「请输入知识库名称」。名称只影响你在列表里认不认得出来,不影响检索。建完可再改。
描述 否 知识库用途说明(可选) 纯备注。但建议写——半年后你会忘记这个库是干什么的。
类型 是(默认公司级) 单选:公司级 / 项目级 / 共享 这个最关键,决定它能被哪些项目检索到。见下面第三节的说明。
所属项目 类型选「项目级」时建议填写 选择项目(下拉列出本公司项目) 只有类型选「项目级」时这个字段才出现。不选的话库建出来了,但不会被任何项目的检索优先命中。
共享下级 否(默认关闭) 开关 + 提示文字:开启后下级项目可检索到本知识库 开着 = 这个库可以被各项目"借"去当兜底资料;关着 = 只有公司层面能用,项目里查不到。

填完点 取消 或 创建。创建成功后右下角会飘出一句「知识库已创建」,列表立刻刷新。

文档归谁?以它所在的知识库为准

往库里上传文档时,文档的归属(属于哪家公司、哪个项目)一律以它被传进的那个知识库 kb_id 为准,而不是看请求里带的参数。所以:传进公司级库的文档就是公司级,传进某项目库的就是那个项目的。如果请求自报的公司 / 项目跟这个库对不上,会被直接拒绝(403「知识库不属于该公司,拒绝上传」/「知识库不属于该项目,拒绝上传」;库 ID 查不到则 404「知识库不存在」)。这条校验是防止把文档挂到不属于自己的库下面、造成归属错乱和计数污染。对正常操作没有影响,你只管先在页面上选对库即可。

三个类型到底怎么选

公司级 company

给全公司共用的资料。品牌手册、法务模板、财务制度、公司简介、统一的报价口径——凡是不管哪个项目都该遵守的,放这里。

列表里显示蓝色「公司级」标签。

项目级 project

给某一条业务线专用的资料。产品说明、客户名单、竞品拆解、这条线的历史数据——只对这一个项目有用的,放这里。

列表里显示绿色「项目级」标签。要配合「所属项目」一起填。

共享 shared

特殊类型。它不是第三种归属,更接近一个标记——把它当成"公司级的、愿意给项目借用"的库。

列表里显示橙色「共享」标签。

检索优先级:项目级优先,公司级兜底

当 AI 在某个项目里检索资料时,系统按 项目级 70% + 公司级共享 30% 的比例取结果:先尽量用这个项目自己的资料,不够才用公司的公共资料补上。这叫分层检索——先看"你这条线的专属档案",再看"公司通用手册"。

反过来说:公司级的私密库(没开「共享下级」)不会被任何项目检索到。这是刻意设计的安全边界,不是漏配。所以你如果希望"公司在项目里也能查到",建库时就把「共享下级」打开。

一个反直觉但很重要的点

知识库没有"项目页面入口"。你不是在项目里建知识库——所有知识库(包括项目级的)都在左侧一级菜单的 知识库 页里统一创建和管理,通过"类型 + 所属项目"来决定归属。找不到"项目里的知识库菜单"是正常的。

RAG 是什么:用一句人话讲清

RAG 是"检索增强生成"的缩写,听起来吓人,其实就是一件事:让 AI 在回答前先去你的资料里翻一遍,把相关的段落找出来,再基于这些段落回答。

打个比方:普通的 AI 像一个博学但没见过你公司的顾问,问什么都能侃,但可能侃错;RAG 像同一个顾问,但每次开口前你先把公司档案袋递给他,他看完再答。答案自然贴你的实际。

有资料库(RAG 生效)

问:"我们的主力产品定价策略是什么?"

AI 答:翻到《定价说明》里那段,按你写的三档价格和折扣规则回答。

没资料库(只能靠猜)

问:"我们的主力产品定价策略是什么?"

AI 答:给出一套"通常的 SaaS 定价建议",看着专业,但和你的实际情况没关系。

RAG 检索页签:你的"自检台"

切到 RAG 检索 页签,你会看到一个搜索框、一个数量下拉(Top 5 / Top 10 / Top 20)和一个 检索 按钮。

这个页签的真正用途

它不是给访客用的搜索框,而是给你自查用的。你上传完资料,就顺手在这里搜一下:"如果我搜『产品定位』,能不能搜到我刚传的那份文档?相似度是不是够高?"

搜得到、相似度也高,说明资料真的吃进去了;搜不到,说明资料没解析成功、或者内容里根本没有这些关键词。这是判断知识库有没有喂好的最快方法(第九章还会再讲怎么系统化地自检)。

三、文档的一生:十个状态

资料进系统不是"传完就完事",它要经过一整条流水线。你打开某个知识库的 文档管理 抽屉,会看到每份文档后面挂着一个状态标签。看懂这几个状态,你就知道它卡在哪一步。

先给结论:后端的文档状态一共有 10 个,界面现在全部给了中文标签,不再有裸英文。万一遇到字典里没有的新值,也会显示成「未知状态(原值)」而不是英文原样——不会再把 processing 这种词直接甩给你。下面表格按流水线顺序排。

待处理uploaded 刚传上来,还没动
→
处理中processing 已被处理入口认领
→
解析中parsing 正在读文件正文
→
已解析parsed 正文读出来了
→
分块中chunking 切成小段
→
向量化中embedding 转成可检索的"数字指纹"
→
就绪ready 可以被 AI 检索到了

不顺利时有两条岔路:一是 失败——上面任何一步出问题,都会掉到 error(失败(可重试))并在文档记录里留下错误说明;自动重试耗尽了则变成 failed(失败(重试耗尽))。二是 需人工确认——解析虽没彻底失败,但走了降级路径(docx/xlsx 只能勉强抽出结构、或正文乱码占比偏高),系统不会再把这种结果直接标成「就绪」,而是标 needs_review(需人工确认),并把原因写进错误说明里,等你复核。

状态 界面中文 它在干什么 卡在这里说明什么 / 怎么办
uploaded 待处理 文件已经存进来了,排队等处理 正常状态,但不会自己往下走。到文档管理抽屉里点那一行的 处理 按钮,才开始解析入库。这是新手最容易漏的一步。
parsing 解析中 正在把文件正文抽成纯文本 大文件(几十 MB 的 PDF)会停久一点,属正常。如果十几分钟还不动,多半是文件本身有问题(扫描件、加密文档),可重传或用 txt 版本。
parsed 已解析 正文提取完成 过渡状态。若长期停在这里,通常是下一步就失败了;刷新一下看是否已变「失败」。
chunking 分块中 把长文切成一段一段(默认每段约 1024 个字符,相邻段重叠约 100 字符) 很快。长期不动多半是文档巨大或已经在出错。
embedding 向量化中 把每一段转成"数字指纹",AI 才能按语义相似度搜到它 这一步要调向量模型、按批处理,耗时最长。大文档停几分钟很正常。若最终失败,常见原因是向量模型未配置或调用失败。
ready 就绪 全部完成,已可被 RAG 检索命中 这才是目标状态。只有"就绪"的文档,AI 才查得到。
processing 处理中 已被某个处理入口"认领",正在处理中 正常流转中的短暂状态。它表示"有人正在处理这份文档,别重复点"。长期停在这里,刷新一下,若仍不动就等超时回收或重新点「处理」。
error 失败(可重试) 处理中断 最常见三种原因:①正文抽出来是空的(扫描版 PDF、纯图片文档、docx/xlsx 这类压缩包格式);②文件本身损坏或格式伪装(比如把一个改名的文件当 PDF 传);③向量模型没配好。这种「失败」还能重试——修好文件或配好模型后,点那一行的 处理 重来。处置办法见 附录 C。
needs_review 需人工确认 解析走了降级路径,产物质量存疑,暂停入库等你复核 这是本版本新增的状态。docx/xlsx 只能勉强抽出结构、或正文乱码占比偏高(≥5%)时,系统不再假装"解析成功",而是把它标成「需人工确认」,并把具体原因写进错误说明里。处理办法:点开错误说明看原因,确认内容可用就直接点「处理」放行入库;若内容确实乱七八糟,就转成 txt/md 重传。它和「失败」的区别是:内容没丢,只是需要你拍板。
failed 失败(重试耗尽) 重试次数已耗尽的终态,不再自动重试 与「失败(可重试)」含义相近,区别是这个状态已经放弃自动重试。处置方式一样:看错误原因,修好文件后重传(见附录 C)。
一条实用规则

文档列表右上角有 刷新。处理大文件时,传完点「处理」,然后过几分钟回来点「刷新」看状态;不要反复点「处理」——已经就绪的文档再点会被跳过,不会重复入库,但你也在白等。

四、导入方式一:直接在知识库上传

这是最直接、最可控的方式:你自己挑文档,自己传,自己触发处理。

  1. 进入知识库,找到目标库

    左侧一级菜单 知识库,在列表里找到你要放资料的那个库。列表列有:名称 / 类型 / 共享 / 文档数 / 分块数 / 状态 / 创建时间 / 操作。

    知识库 › 找到你的库 › 操作列「文档管理」
  2. 打开文档管理抽屉

    点该行的 文档管理,右侧滑出抽屉,标题是「文档管理 · 你的库名」。工具栏上是 上传文档 和 刷新。

    列表每一行的操作列有两个按钮:状态还不是「就绪」时出现 处理;右侧的 删除 可以按单份文档删除——点它会二次确认「确认删除文档「X」?将同时删除其已入库的分块,且不可恢复。」(按钮「删除 / 取消」)。这是本版本新增的粒度:以前想清掉一份传错的文档,只能把整个知识库删了重建,现在单独删一条就行,删掉后它的分块也一并从检索里移除。

  3. 选文件上传

    点 上传文档,在弹出的文件框里选一个文件。上传成功后提示:上传成功,请点击「处理」开始解析入库。

    一次一个

    这个入口是单文件的,选完就传。要传多份,重复这一步。刚上传的文档状态是「待处理」。

  4. 点「处理」,等它变成「就绪」

    在文档列表里找到刚传的那一行(状态还不等于「就绪」时,操作列会显示 处理 按钮),点它。处理成功后提示 文档处理完成,状态会一路走到「就绪」。

  5. 去 RAG 检索页签自检

    切到 RAG 检索,用文档里的一个关键词搜一下,确认能搜到、相似度合理。这一条闭环才算走完。

支持哪些格式(请务必看这一节)

知识库上传窗口接受的格式,界面上限定了这六种:pdf、txt、md(含 .markdown)、docx、xlsx。但"能传上去"和"解析得好"是两件事,差别很大。

这六种现在是硬闸门,不是"界面拦一下"而已

以前上传格式只靠前端的文件选择框的 accept 过滤,绕过界面(比如用脚本调接口)就能塞进别的格式。现在后端也加了上传格式闸门,两道校验:

唯一保持原契约的是 PDF:它的魔数校验留在解析阶段而非上传口——所以一个伪装成 PDF 的文件还能传上去,但处理时会以「失败(可重试)」状态 + 一条可读的失败原因落库,而不是静默通过。

格式 能不能传 解析效果 建议
txt / md 支持 最好。直接按文本读取,自动处理编码(UTF-8 优先,疑似 GBK 的老文件会按 GB18030 解码),几乎不会失败 首选。有旧文档时,先转成 txt/md 再传,最省事也最准
pdf 支持 只抽取 PDF 里"文字层"的内容。扫描件 / 图片型 PDF 抽不出文字,会直接判为失败 如果是扫描件,先用 OCR 工具转成 txt 再传
docx 支持 解析质量差。Word 文档本质是一个压缩包,当前只做"可打印字符抽取",真正的正文基本抽不出来,抽到的多是二进制噪声。好消息是:这种降级解析的结果不会再被标成「就绪」,而是标成「需人工确认」并给出原因,等你复核——不会被误当成可检索的资料 重要的 docx 请先另存为 txt 或粘贴成 md 再传
xlsx 支持 同上(表格文件同样是压缩包)。表格结构会彻底丢失,只剩零散噪声字符;同样会被标成「需人工确认」而非「就绪」 台账类数据,建议只把"结论性文字"整理成 txt 段落再传,原始表格留着不要指望它被读懂
csv / pptx / doc / 图片 / 压缩包 不在上传窗口白名单 — 先用工具转成 txt / md 再传。要放 PPT 内容,就复制文字出来
pptx 到底支不支持?分清两条链路

知识库上传区明确写着支持的格式「pdf / txt / md / markdown / docx / xlsx;其中 docx、xlsx 为降级解析(正文可能抽取不全,建议另存为 txt/md),演示稿(.pptx)不支持,请先另存为 PDF 或文本再上传」。也就是说:知识库这条管线只认到 docx / xlsx,pptx 进不来。

但你可能会在别处看到 pptx 被列为支持——那是会议记录导入(见本章第六节),它走的是另一条解析链路,能处理 pptx,梳理完再落到你指定的知识库。两条链路支持的格式不一样,别拿会议导入的清单去套知识库上传。

大小限制:单文件 ≤ 50MB

上传有 50MB 的单文件上限。超了会被拒绝,且不会残留任何记录。真实场景里超过 50MB 的文档基本都不适合整份入库——建议拆分或只提炼要点。

同一份文件传两次会怎样?

在同一个知识库里重复上传完全相同的文件,系统会识别出内容一致(按文件内容校验),直接复用已有的那份,不产生新记录、也不重复占空间。所以传重了不用慌,不会污染知识库、不会重复计费。

系统还会按已有文档的当前状态给你一句提示,照着做就行:已就绪的提示「该文件内容已存在且解析就绪,本次未重复入库」;上次是「失败」或「需人工确认」的,提示「该文件已存在且上次处理失败/需人工确认,请在文档列表点「处理」重试」;正在处理的则提示「该文件已存在,正在处理中」。

但如果你把同一份内容传到两个不同的知识库,它们会各自入库一次——这是刻意的,因为两个库的归属和可见范围不同。

顺手说一句:AI 对话里的附件

左侧一级菜单的 AI 对话 页,输入框旁边有个曲别针按钮,可以传附件。它是"临时参考"性质——只服务于那一轮对话,不会进任何知识库,也不会被后续检索命中。适合"我就想问问这个文件里的某段话"。想把资料长期沉淀,还是走知识库。支持的格式和大小见 附录 B。

五、导入方式二:边缘客户端(本地文档自动扫描上传)

如果资料散在你电脑的各个文件夹里,一个个手动挑太慢。这时用边缘客户端——一个装在你电脑上的小工具,它盯着你指定的文件夹,发现新文档就自动解析、自动上传。

为什么需要它

平台是云端的、项目服务器是云端的,但你的资料在你本地的电脑里。云端程序没法直接读你 D 盘的文件夹。边缘客户端就是那座桥:它在你本机运行,负责"把本地的东西送到云端",同时也能接收项目服务器下发的指令在本机执行(比如批量提取某目录的文档文本)。

它长什么样:一个托盘图标,界面是英文的

边缘客户端没有窗口界面,它常驻在系统托盘(Windows 右下角、macOS 右上角)。托盘图标右键菜单全部是英文,逐项如下。

菜单项(原文) 中文意思 现状
ZY Edge Client(标题) 工具名,鼠标悬停还会显示 ZY Enterprise AI Engine - Edge Client 图标是一个极简的蓝色圆点,属占位图标,不是正式品牌图
Status: Connected 已连接 可用
Status: Connecting... 连接中 可用
Status: Reconnecting... 重连中(断线后自动重试) 可用
Status: Disconnected 未连接 可用
Open Logs 打开日志目录 可用——点了会用系统默认程序打开日志所在目录,排障时直接进去看文件
Quit 退出 可用
先把预期放正

托盘菜单现在只剩「Open Logs / Quit」两项:Open Logs 已经能真正打开日志目录;原来的「Reconnect」菜单项已被移除——因为连接层本身就按指数退避自动重连了,不需要你手动点。所以如果你在旧教程里看到「Reconnect」按钮,那是过期信息。图标仍是占位图,菜单是英文,这些属正常,不用担心装错。

它盯着哪些文件夹、认哪些格式

客户端的行为由一份配置决定(本机配置文件)。关键几项:

配置项 默认值 意思
watch_dirs(监听目录) 空 / 需自行指定 你告诉它盯着哪几个文件夹。只在清单里的目录才会被扫描
file_types(认的格式) .pdf .docx .xlsx .txt .md .csv 不在这六种里的文件,客户端会直接忽略
max_file_size_mb 50 超过 50MB 的文件跳过(超大文件只上传解析出的文本要点)
debounce_interval 2 秒 文件放进去后等 2 秒再处理,避免"文件还没写完就传"
upload(并发 / 超时 / 重试) 3 / 60 秒 / 3 次 同时传 3 个文件;网络类错误自动重试,被服务器明确拒绝(4xx)时不再重试
server.base_url / token 需配置 项目服务器的加密连接地址与访问令牌。令牌没配对,一切都不会动

连接方式是加密长连接(WSS),直连你项目的项目服务器(不经平台转发)。连接后每 30 秒心跳一次;断线会按 1 秒 → 2 秒 → … → 60 秒 的退避节奏自动重连。

上传后你在哪里看

客户端传上去的文件,在项目内的 边缘接入 页能看到。

项目内 › 接入与执行 › 边缘接入(/project/<id>/edge)

页面上方一排状态卡:连接状态(已连接 / 未连接)、在线客户端、客户端版本、累计上传文件、WebSocket 端点 / 最近心跳(没有心跳时显示 暂无心跳)。下方是「上传文件」表,列有:文件名 / 原始路径 / 大小 / 状态 / 上传时间,顶部还能按状态筛选。

状态 界面中文 含义
uploaded已上传文件已到服务器,等待进入知识库处理流程
processing处理中正在解析入库
indexed已索引已入库,可被检索到
failed失败上传或解析失败,需要在客户端侧重传

列表没数据时显示 暂无上传文件。

「客户端版本」和「最近心跳」可能一直是空的

这两个位置取自服务端的实时统计,当前版本里很可能一直显示 - 和 暂无心跳,但左侧的「连接状态」和「在线客户端」是准的。以"连接状态是否已连接 + 上传文件表里有没有你的文件"为准,不用纠结版本号为空。

一直 Status: Disconnected 怎么办

托盘上如果长期显示未连接,按这个顺序查:

  1. 先确认程序在跑——托盘图标还在不在?Quit 之后是不会自动回来的。
  2. 检查配置里的服务器地址和令牌——base_url 写对了吗(要带 wss://);token 是不是有效的(激活后拿到的)。这两项任一不对,服务端会直接拒绝握手。
  3. 检查网络与证书——本机能不能访问那台服务器;如果是自签证书,配置里有个"跳过证书校验"的开关,但它只允许在开发环境打开,正式环境必须用合法证书。
  4. 换个网络试试——公司网络带拦截代理时,长连接经常被掐断。
卡住超过十分钟?

边缘客户端相关故障的完整排查表在 第 19 章 故障自查、安全与红线。这里先记住一条底线:服务端对连接采用"校验不过就拒绝"的失败关闭(fail-closed)策略——没有配置访问令牌、令牌已吊销或已过期,一律拒绝连接,绝不会"因为你没配就放行"。这是安全设计,不是故障。

六、导入方式三:会议记录导入

会议纪要是一种被严重低估的资料。它天然带着三类高价值信息:发生了什么、决定了什么、谁要做什么。这一节讲的就是怎么把会议记录喂进去——并且,把"行动项"直接变成 AI 要去执行的任务。

项目内 › 研究与获客 › 会议导入(/project/<id>/meetings)

页面标题是 会议内容导入梳理。结构分两块:上面是导入区,下面是「会议记录」列表。

导入区:先选目标知识库(可选)

最上面一行是 目标知识库(可选): 加一个下拉框,提示文字是 选择知识库,梳理后自动入库 RAG。

这一栏决定会议内容会不会"长期留下来"

选了一个知识库:AI 梳理完之后,会自动把梳理结果作为一份文档写进那个知识库,之后可以被 RAG 检索到,成为 AI 的长期记忆。
不选:会议记录照样会梳理、会出现在列表里、行动项照样能转任务,但不会进知识库,后续检索不到。

所以:这场会议如果"以后还会被翻出来参考",就选一个库;如果只是临时把纪要变成任务,可以不选。

两种投喂方式

页签一:上传文件

点 选择会议文件 挑一个文件。旁边有一行小字说明:支持 txt / md / docx / pdf / xlsx / pptx,暂不支持音视频。

成功后会提示 会议文件已上传,AI 正在后台梳理。

页签二:粘贴文本

直接把会议记录粘进去。两个输入框:

  • 标题:会议标题(可选,如:产品周会 8/13)
  • 正文:粘贴会议记录文本,AI 将自动梳理摘要、决策与行动项

正文为空时 开始梳理 是禁用的。点了之后提示 已提交,AI 正在后台梳理。

音视频确实不支持,别硬传

传了音频或视频文件,会被明确拒绝并提示"暂不支持音视频文件,请先转写为文本后导入"。要用录音,请先用转写工具(或会议软件自带的"导出文字记录")转成文字,再走"粘贴文本"这条路。

另外,文件名后缀不在白名单里的(比如 .csv、.json、.doc),也会被拒绝并提示只支持哪几种。白名单和上传窗口的提示一致。

梳理会花钱

"梳理"这一步是一次实打实的 AI 调用(要读完整篇记录、输出结构化结果),会计入这个项目的 token 消耗。长会议记录花费会更明显——这是正常的,一次梳理的成本远低于人工整理一小时的会议纪要。

会议列表:五种状态

下方 会议记录 列表有 刷新 按钮,列是:会议标题 / 来源 / 状态 / 导入时间 / 操作。来源只有两种:文件 或 文本。

状态 界面中文 说明
pending待处理刚提交,还没开始(通常只停留几秒)
parsing解析中正在把文件正文读出来(粘贴文本的方式一般跳过这步)
analyzing分析中AI 正在梳理摘要 / 决策 / 行动项,这一步最久
done已完成梳理结果已就绪,可以点详情看,也可以转任务
error失败流程中断,详情抽屉里会显示失败原因原文

列表操作列有三个按钮:详情;重新梳理(只在状态是「失败」或「已完成」时出现);删除(会弹确认框「确认删除会议「X」?」,删除后提示「已删除」)。

「重新梳理」的用途

失败时重跑一次;或者已完成的会议你又补了内容想重来。注意:正在分析中的记录不允许重置,会提示「会议正在梳理中,请稍后再试」——这是防止重复梳理把行动项搞出两份的保护。

详情抽屉:参会人 / 会议摘要 / 决策 / 行动项

点 详情,右侧滑出抽屉,标题就是这场会议的标题。里面分四段:

如果会议还在梳理中,抽屉里显示 正在梳理中,请稍后刷新查看;如果失败了,显示 处理失败,并在顶部用红色提示条给出具体原因。

重点:从会议到任务这条闭环

这是本节最值钱的部分。行动项不只是文字,它可以一键变成 AI 要去执行的任务。

开会讨论、拍板
→
导入传文件或粘文本
→
AI 梳理摘要 + 决策 + 行动项
→
点「转自动运营任务」
→
自动运营接到任务排进任务队列

行动项有三种状态,界面中文如下:

状态 界面中文 这一行能看到什么
open 待处理 右侧出现 转自动运营任务 按钮
done 已完成 只读,没有转换按钮
converted 已转任务 显示 已转任务 <任务号>,一眼知道它去哪了

点 转自动运营任务 会先弹一个小气泡确认:将该行动项转为自动运营任务?,按钮是「转换」和「取消」。确认后提示 已转为任务 <任务号>,这条行动项的状态立刻变成「已转任务」。

转过去之后发生了什么

系统会新建一条自动运营任务:任务名和描述都取行动项的内容,验收标准写成"完成行动项:<内容>",优先级定为常规(P2),执行引擎默认用 Agent 引擎(进程内调 AI,适合信息整理、对外联络这类任务)。

然后它就进了这个项目的任务队列,跟你在"新建任务"里手工建的任务一样,由自动运营按轮次推进。你在 自动运营 → 任务管理 里能看到它(第 09 章)。

两条限制要知道

① 已经转过一次的行动项不能再转,会提示状态不对、无法转换——这是防止同一件事被派两份任务。
② 只能转本项目的行动项,跨项目转不了。

会议场景 · 粘贴文本时怎么写得让 AI 更好梳理会议标题:产品周会 8/13 参会人:我、运营小李、外聘设计老王 本次议题:独立站首页改版 讨论要点: - 老王反馈当前首页跳出率高,主要卡在首屏没有价值主张 - 小李说广告投放的数据显示,客户最关心的是"多久能收到货" - 我决定首页首屏改成"3 天到货 + 60 天无理由" 本次决策: 1. 首页首屏重做,突出时效与退换承诺,本周五前出稿 2. 暂停当前关键词投放,等新版上线后再投 行动项: - 老王:出 2 版首屏视觉方案(截止 8/16) - 小李:整理近 30 天客户咨询里"物流时效"相关的原话,给老王做参考(截止 8/15) - 我:确认新版首页的退换货政策文案是否与合同条款一致(截止 8/15)

这样写的好处:参会人、决策、行动项、责任人、截止时间都显式给出。AI 不用猜,梳理出来的结果就能直接用于转任务。

七、导入方式四:已有项目整体导入(本章重点)

这一节回答用户最关心的那个问题:"我已经有在跑的项目了,资料一大堆,怎么整体搬进来?"

系统的答案是「现有项目导入」:你把项目的名称、描述、既有资料、过去的聊天记录要点交代给它,AI 把它整理成一份项目上下文,作为后续建项与自动运营的起点。

项目内 › 建项与定义 › AI 问答 › 右上角 项目导入

页面标题是 现有项目导入,左上角有 返回项目。页面分左右两栏。

左栏:项目信息与资料

字段 / 按钮 界面提示(原文) 怎么填
项目名称 已进行中项目的名称 填你线下/原有那套体系里这个项目叫什么。它会成为 AI 理解项目的入口信息。
项目描述 一句话说明项目定位 一句话:做什么、卖给谁。例如"面向北美中小卖家的跨境独立站,主营家居收纳"。
既有资料 拖拽上传区,提示:支持 txt/md/docx/pdf/xlsx/csv 等,单文件 ≤ 50MB;需先创建会话 把手上已有的文档拖进来。最多 10 个文件一次。
上传到会话 未建会话 / 未选文件时按钮置灰 先把文件选好、先建会话,这个按钮才会亮。
聊天记录 粘贴关键沟通/聊天记录的要点摘要 这一栏性价比最高。不需要粘贴原始聊天记录,只要把要点摘要写进去(谁、什么时候、谈成了什么、还卡在哪)。
创建导入会话 — 整页的"启动键"。先点它,才有后面的上传与整理。

两个提示语要知道:

右栏:AI 整理的项目上下文

右栏有两张卡。

第一张卡叫 AI 整理的项目上下文,右上角是 整理并完成建项 按钮。还没建会话时,卡里写着 左侧填写信息并「创建导入会话」后,可在此触发 AI 整理;建了会话但还没整理时,显示 点击「整理并完成建项」生成上下文摘要。

点下去之后,AI 会把前面所有信息(名称、描述、你传的文档、聊天记录要点)读一遍,产出一份结构化的项目上下文,显示四项:

项目背景

这个项目是干什么的、怎么来的

当前阶段

它现在走到哪一步了

关键联系人

涉及哪些人(标签形式展示)

未决事项

还悬着没定的问题清单

整理成功后提示 导入整理完成,已标记待续建——"待续建"的意思是:这份上下文已经存好了,等着你去确认执行策略、把任务正式建起来。

第二张卡叫 会话状态,只在会话建好之后出现,显示三项:会话 ID / 阶段 / 状态。阶段的中文映射是:

阶段代码界面中文你在这一步该做什么
research调研(新项目引导流程的起点)
input信息录入补充项目背景与资料
summarize摘要整理让 AI 归纳成摘要
strategy策略生成生成并确认执行策略
import导入「现有项目导入」走的就是这个阶段
done已完成建项完成,可进入自动运营

整理完成后,这张卡里会出现 下一步:确认执行策略 按钮,点它直接跳到引导建项页(下一节)。

关于"上传的资料去哪了",必须说清楚

导入页上传的资料,不会自动进知识库

这是最容易产生误解的一点。你在「现有项目导入」页传的文档,作用是让 AI 读懂这个项目——系统会从中抽取文字要点,追加到导入会话里,供"整理项目上下文"使用。它不会直接变成知识库文档,也因此不会被后续的 RAG 检索命中。

这不是缺陷,而是流程分工:这一步是"建项之前的摸底",等建项完成、项目有了自己的知识库 ID,再正式把资料放进知识库。正确做法:导入页负责"说清楚是什么项目",知识库页负责"把资料存下来长期用"。

所以:导入页的文档怎么写最划算

既然是"给 AI 读的摸底材料",那就优先放散装文字,而不是厚重的 PDF。原因有两个:一是导入页对 docx / pdf 这类文件同样只做"可打印文字抽取",质量一般;二是 PDF 再厚,AI 也只能从中读到模糊的一份印象。

更划算的填法是:既有资料栏放几份关键的 txt / md(或把文档里的核心段落复制成 txt),同时把最关键的信息手打摘要到"聊天记录"栏。手打的那几百字,价值往往高于十份 PDF。

完整操作顺序:照着走一遍

  1. 先在平台建一个"项目占位"

    导入是"在某个项目里"进行的,所以你得先有一个项目。走新建项目向导(第 03 章),把名称、类型、行业、运行模式、预算填好,提交创建。这一步不需要填得很完美,后面能改。

    项目管理 › 新建项目向导
  2. 进入这个项目,打开导入页

    从项目列表进入项目,左侧切到 建项与定义 → AI 问答,点右上角的 项目导入。

    项目内 › 建项与定义 › AI 问答 › 项目导入
  3. 填名称、描述,先把"聊天记录"写扎实

    填项目名称、项目描述;然后在「聊天记录」里把项目的前世今生写成要点摘要(谁在跟、当前进展、卡在哪、下一步想干什么)。这是整页里最值钱的一段字。

  4. 点「创建导入会话」

    成功提示 导入会话已创建,右栏出现「会话状态」卡,阶段显示「导入」。

  5. 上传既有资料

    拖拽文件到上传区(最多 10 个,单个 ≤ 50MB),然后点 上传到会话。成功提示 已上传 N 个文档,待整理后纳入项目上下文。

  6. 点「整理并完成建项」

    等 AI 读完所有材料,右栏出现「项目背景 / 当前阶段 / 关键联系人 / 未决事项」四段结果。提示 导入整理完成,已标记待续建。

  7. 点「下一步:确认执行策略」

    跳到引导建项页,把执行策略生成、修改、确认(下一节详解)。这一步不能跳,没确认策略,自动运营是启动不了的。

  8. 回项目详情,启动自动运营

    策略确认后,到 自动运营控制台 点 启动,AI 开始按任务队列跑起来。

    项目内 › 组织与运营 › 自动运营
  9. 补知识库(长期记忆)

    再回到左侧 知识库,为这个项目建一个"项目级"库,把产品资料、客户资料、竞品分析正式传进去并处理到「就绪」。这一步做完,AI 才算真正"认识你的生意"。

    左侧一级菜单 › 知识库 › 新建知识库(类型选「项目级」)
顺序错了会怎样

最常见的新手错误是:建完项目就直接点「启动」,结果被拦——因为还没确认执行策略。所以请记住这个顺序:建项目 → 导入/引导 → 确认策略 → 补知识库 → 再启动。启动永远是最后一步。

「你手上有什么」→「该怎么导入」对照表

你手上的东西 推荐通道 具体怎么做
合同 / 报价单(PDF 或扫描件) 知识库上传 如果是扫描件,先 OCR 成 txt 再传;电子版 PDF 可直接传。价格体系这类要长期被引用的,务必进项目级知识库
产品手册 / 说明书 知识库上传 优先 txt / md。docx 可传,但建议只把核心技术段落另存成 txt
Excel 台账(订单、库存、客户表) 知识库上传(谨慎) 表格类内容进知识库后只剩下零散文字,AI 读不出结构。更推荐把"结论"整理成一段说明文字再传
微信 / 钉钉聊天记录 项目导入 或 会议导入 别贴原始记录。整理成"要点摘要"(谁、何时、谈到什么、结论是什么)再贴进去——导入页的「聊天记录」栏,或会议导入的「粘贴文本」
旧网站上的内容 知识库上传 把网页正文复制出来存成 txt / md 再传。没有"一键抓取整个网站"的功能,不要期待
竞品资料 知识库上传 放项目级知识库;建一个叫"竞品分析"的库专门放,检索时更干净
内部 SOP / 制度文件 知识库上传 如果全公司通用(比如报销制度),放公司级库并打开「共享下级」
代码仓库 不适用 代码通过"软件工程"模块管理,不进知识库。想加复杂功能,见第 10 章
会议录音 / 录像 会议导入(需先转文字) 系统不支持音视频。先用转写工具或会议软件导出文字,再走"粘贴文本"
散落在电脑各处的旧文档 边缘客户端 装客户端,把那些文件夹加进监听目录,让它自己扫、自己传(第四节)

八、导入方式五:引导建项(从想法到执行策略)

前一条路是"接手续建",这一条是"从零起步"。新项目创建之后,用引导建项把项目背景聊清楚,让 AI 生成一份执行策略——那才是 AI 后面所有动作的蓝图。

项目内 › 建项与定义 › AI 问答 › 右上角 引导建项

页面标题是 引导建项,里面纵向排四张卡片。

卡片一:引导会话

最上面一行是一个输入框加两个按钮:

下面会显示两个标签:阶段:<中文阶段名>,以及 策略已确认 或 策略未确认。这两个标签是你的"仪表盘"——尤其是后一个,它直接决定自动运营能不能启动。

卡片二:项目信息与对话补充

上半部分是从项目档案自动读进来的种子信息:项目名称 / 项目类型 / 所属行业 / 项目描述 / 目标。右上角有 重新从项目档案载入,你在项目详情页改过之后可以点它刷新。读不到时显示 未从项目档案读到种子信息,可直接在下方对话补充。

下半部分是「对话补充」。这里是你和 AI 聊项目的地方:

对话里如果出现了「较早对话摘要」这样一条居中的灰色气泡,那是系统把太长之前的对话自动压缩成摘要,不是 AI 的一轮回答,也不影响后续流程。

卡片三:项目摘要

点右上角 生成摘要,AI 会把你的种子信息 + 对话内容归纳成一份结构化摘要,字段包括:项目名称 / 项目描述 / 核心问题 / 核心目标 / 目标用户 / 约束条件 / 里程碑 / 建议智能体。

没有摘要时显示 尚无项目摘要,补充对话后点击「生成摘要」。如果 AI 产出的摘要不完整,会在顶部给出黄色提示条「摘要有降级:…」,流程不受影响。

别空着就点「生成摘要」

既没聊天记录、项目档案里也没有信息时点生成,会被拦下并提示 请先补充项目信息或与 AI 对话后再生成摘要。这是防止 AI 在没料的情况下编出一份看起来很像样、其实全是猜的摘要——那种摘要会污染后面的策略生成。

卡片四:项目执行策略

这是整页的重头戏。右上角三个按钮:重新生成 / 确认策略 / 完成建项。

生成出来的策略可以直接改——它们就是普通的输入框:

策略字段 形式 你在改什么
里程碑 多行文本(每行一条) 这个项目要在哪几个节点上"交付成果"。AI 后面拆任务会围着它转
关键路径 多行文本(每行一条) 哪几件事是"不做完后面都动不了"的
目标拆解 多行文本(每行一条) 把大目标拆成几块可执行的方向
所需岗位 表格:岗位 / 职责 / 人数 + 添加岗位 这个项目要配哪些"AI 岗位"、各几个人。这里定的岗位会体现在后续的组织与智能体里
预算建议 总预算(元)、AI 运行预算(元) AI 给的建议值,你可以改。这是"建议",最终以项目预算设置为准

没生成策略时这里显示 尚未生成策略,请先创建会话并点击「生成策略」。

「重新生成」和「确认策略」的区别

重新生成:让 AI 再给一版草案。它不落库,你不满意就一直重来。
确认策略:把你在页面上改完的这版正式存下来,并标记「策略已确认」。只有确认过的策略才是正式执行蓝图,AI 后面按它拆任务。
点「确认策略」前如果还没生成过策略,会提示「请先生成策略」。

最重要的是这一条:不确认策略,自动运营起不来

页面上有一行黄色告警原文,请记住它:未确认策略时,启动自动运营会被拦(/autoops/start 要求已确认策略)。

真的去点启动,系统会拒绝并提示:策略未确认,请先完成引导建项并确认执行策略。这不是 bug,是刻意设的门槛——防止 AI 在"没有蓝图"的情况下自己乱跑、白烧钱。

大多数"我点了启动没反应"的问题,都出在这里。

完成建项:把策略变成任务

确认策略之后点 完成建项。成功提示 建项完成,已生成 N 条初始任务,并在下方显示四项结果:

初始任务数
N
AI 按策略拆出来的第一批任务
阶段
—
建项后会话进入的阶段
幂等复用
是 / 否
「是」表示这次没有重复建,复用了上次的结果
项目 ID
—
任务挂到了哪个项目上

如果建项没成,这里会显示红色提示 建项未完成:<原因>。最常见的原因是项目档案里缺少最基本的信息(没有项目定义),系统会明确告诉你"没有项目定义,建项被跳过",而不是假装成功——这一点可以放心。

「幂等复用:是」是好事

表示你重复点了「完成建项」,系统识别出"这个项目已经建过了",直接复用上次结果,没有重复创建任务。所以你多点几次不会造出一堆重复任务。

关于"调研"这个阶段

阶段的第一个名字叫「调研」(research),流程上它是新项目引导的起点。需要说明的是:当前版本的引导建项页不会自动联网做调研,策略是 AI 基于你补充的信息与摘要生成的。想让它联网查资料,在 AI 问答 页勾选「联网搜索」再问(该选项默认关闭)。

引导建项 · 对话补充时的万能四句我的项目是【跨境电商独立站,主营家居收纳,面向北美】。 现状:已经有 Shopify 店铺,月销约 800 单,主要靠广告投放,自然流量几乎没有。 目标:90 天内把自然流量占比从 5% 提到 30%,同时把广告成本压到销售额的 15% 以内。 约束:我一个人做,每周只能投入 10 小时,每月预算不超过 3000 元;不请外部代运营。 已知资源:现有商品页 30 个、老客户邮箱列表 2000 条、供应商 3 家(都有现货)。 请据此生成执行策略,里程碑请按"周"来排。

九、待确认知识清单(知识入库的最后一道闸)

前面讲的都是"人喂给 AI"。这一节讲反过来的方向:AI 想沉淀知识时,得先过你这一关。

直接访问 /project/<项目ID>/kb/review
这一页当前没有侧边栏入口

「待确认知识清单」目前不在侧边栏菜单里,需要手工访问上面的网址才能打开(把 <项目ID> 换成你的项目数字 ID,也就是项目详情页网址里那个数字)。这是当前版本的实际情况,不是你没找到。后续版本若补齐入口,以实际界面为准。

页面标题是 待确认知识清单,右上角有 返回知识库 和 刷新。页面顶部常驻一条蓝色提示,原文是:

以下知识条目需人工确认后才会写入正式知识库并参与全局检索

下方是表格,列为:节点 ID / 标题 / 详情 / 状态 / 操作。没有待确认条目时显示 暂无待确认知识。后台只把「待确认」状态的节点送进这张表,所以你实际看到的每一行都是可以确认的。

状态 界面中文 说明
pending待确认等你拍板。只有这一种状态点 确认入库 才有意义
in_progress处理中正在走入库流程
completed已入库已正式沉淀
rejected已驳回被拒绝,不会入库

(上表是节点状态的完整枚举;在这一页你实际只会看到「待确认」。)

点 确认入库,成功后提示 知识已确认入库,该条立刻从清单里消失。

这些条目是从哪来的?

它们来自你在 AI 问答 页的操作。当 AI 给出一段特别好的回答,你想把它"沉淀成范例、以后遇到类似问题直接参考"时,就会用到「提升为案例」这个动作。系统不放心让 AI 自己决定什么该沉淀——所以:

为什么要人工确认

因为知识库是"AI 长期要参考的东西"。如果 AI 自己觉得"这条不错"就直接写进去,一旦那条内容是错的、过时的、或者含敏感信息,它就会反复污染后面每一次回答——错误被引用,还会被当作范例继续放大。加一道人工闸门,成本很低,收益很大。

不是所有项目都有这一页的内容

只有当项目开启了"知识入库人工确认",才会有条目落到这里。没开启时,这类提升动作会直接生效、不进这个清单。所以清单长期为空是正常的。但只要你看到有「待确认」的条目,就说明有知识在门口等你放行,别放着不管。

十、怎么判断知识库"喂好了"

上传完成不等于喂好了。下面四步是验收动作,建议每次大批量导入后都做一遍。

① 用 RAG 检索自检(最关键)

去 知识库 → RAG 检索,搜 5 个你能判断对错的问题关键词,比如"产品定位""目标客户""退款政策""核心卖点""竞品差异"。

判断标准:能搜到 + 相似度不低 + 搜出来的段落确实是讲这件事的。五条里对三条以上,说明喂得不错;搜不到或者搜出来驴唇不对马嘴,说明资料有问题(见附录 C)。

② 看文档状态是不是都「就绪」

挨个知识库打开「文档管理」抽屉,扫一眼状态列。只要还有「待处理」,就说明它是死文件,AI 永远查不到——点「处理」把它推下去。

还有「失败」的,去附录 C 查原因。别留着一堆失败文档假装没看见。

③ 问一次 AI,看它有没有用你的资料

去 AI 问答 页(勾上「知识库检索」),问一个只有你资料里才有答案的问题,比如"我们公司的 X 是什么?"。

如果它答得贴你的实际情况,说明 RAG 生效;如果它给的是一套通用说法,说明资料没被检索到。

④ 定期清理过期资料

知识库不是"越大越好"。过期的价格表、作废的制度、淘汰的产品说明留在库里,会持续干扰 AI 的判断。

建议每季度过一遍:把作废文档删掉(文档管理里可删),或把整个过期的库删掉(知识库列表操作列有「删除」,会连文档与分块一起清掉,不可恢复,删前想清楚)。

删知识库是不可恢复的

点「删除」会弹确认框:确认删除知识库「X」?将同时删除其下所有文档与分块,且不可恢复。确认后,这个库连同里面所有文档和分块一起被清掉,没法找回。删之前先确认"里面的东西别处还有备份"。

十一、本章小结与下一步

上一章:项目内页面导览 下一步:智能体 导入失败?查故障排查章 RAG / Few-Shot 是什么?查术语表

附录 A · 资料导入方式对照全表

把这张表打印出来贴在手边。遇到"这份资料该怎么弄进去",先查它。

方式 入口路径 支持格式(界面白名单) 大小 / 数量限制 要人工确认吗 适合的资料 常见失败原因
① 知识库上传 知识库 › 文档管理 › 上传文档 pdf / txt / md / markdown / docx / xlsx 单文件 ≤ 50MB;一次一个 要:传完还要点「处理」 已整理好的正式资料,要长期被 AI 引用 扫描件 PDF 抽不出文字;docx/xlsx 解析质量差;忘了点「处理」
② 边缘客户端 本机托盘程序(上传结果看 项目内 › 边缘接入) pdf / docx / xlsx / txt / md / csv 单文件 ≤ 50MB;目录可配多个 要:入库仍走知识库处理 散落在本机各目录的旧文档,量大不想手动挑 服务器地址/令牌没配;目录不在监听清单;格式不在白名单;一直 Disconnected
③ 会议导入(文件) 项目内 › 研究与获客 › 会议导入 › 上传文件 txt / md / markdown / docx / pdf / xlsx / pptx 单文件,无显式界面上限 否(后台自动梳理) 会议纪要文件、决议文档、周报 音视频被明确拒绝;格式不在白名单;文件内容为空
③ 会议导入(文本) 会议导入 › 粘贴文本 › 开始梳理 纯文本粘贴 正文不能为空 否;但行动项转任务时会弹确认 手边有文字版纪要、转写稿 内容太短/太乱,AI 梳理不出行动项
④ 项目导入 项目内 › AI 问答 › 项目导入 txt / md / doc / docx / pdf / xlsx / xls / csv / json 单文件 ≤ 50MB;最多 10 个文件 要:需先「创建导入会话」再上传,最后「整理并完成建项」 接手已有项目时的摸底材料、聊天记录要点 没建会话就点上传;没选公司;上传后忘了点「整理并完成建项」
④ 项目导入(聊天记录) 同上,直接粘贴到「聊天记录」栏 纯文本粘贴 建议控制在几百字要点 要:同「整理并完成建项」 微信/钉钉沟通要点、客户往来结论 贴了原始长记录而非要点,AI 抓不住重点
⑤ 引导建项(对话补充) 项目内 › AI 问答 › 引导建项 › 对话补充 纯文本对话 — 要:策略必须点「确认策略」 新项目的背景、目标、约束、资源 空着就点「生成摘要」被拦;生成策略后忘了确认
⑥ AI 对话附件 左侧一级菜单 › AI 对话 › 输入框曲别针 doc / docx / pdf / txt / md / xlsx / xls / ppt / pptx / html / csv / json 单文件 ≤ 50MB 否 临时参考:只想就这个文件问一下,不长期沉淀 误以为它进了知识库(其实没有)
怎么选:三个问题定通道

问一:这份资料以后还要被反复引用吗?要 → 走①知识库。不要,只是这次想问 → 走⑥对话附件。
问二:资料在我电脑里,还是我手上已经有文字了?在电脑里、量很大 → 走②边缘客户端。手上已有文字 → 直接粘贴进③或④。
问三:项目是新的还是已经在跑的?已经在跑 → 走④项目导入。全新的 → 走⑤引导建项。

附录 B · 文件格式支持与限制总表

四个入口的白名单各不相同,别记混。下表逐入口列出(以当前代码为准)。

格式 知识库上传 AI 对话附件 项目导入 会议导入 边缘客户端扫描
txt✔✔✔✔✔
md / markdown✔✔(.md)✔✔✔
pdf✔✔✔✔✔
docx✔✔✔✔✔
doc(旧版 Word)✘✔✔✘✘
xlsx✔✔✔✔✔
xls(旧版 Excel)✘✔✔✘✘
csv✘✔✔✘✔
pptx / ppt✘✔✘✔(.pptx)✘
json✘✔✔✘✘
html / htm✘✔✘✘✘
音视频(mp3/mp4 等)✘✘✘✘ 明确拒绝✘
这张表怎么读

表里这几列,说的是界面上「允许你选中」的格式(上传控件的可选类型),以当前前端代码为准。其中 「知识库上传」这一列现在同时被后端强制校验:扩闸门只认列出的这几种扩展名(无扩展名或其它后缀直接 400),docx / xlsx 还要过 OOXML 魔数校验——所以这一列对知识库入口而言已经是硬边界。其它几列(对话附件、项目导入、会议导入、边缘扫描)仍以各自前端控件的可选项为准。

不管走哪个入口,都别把"✔"理解成"一定解析得好"(docx / xlsx 就是反例:能传,但解析质量差)。真正稳妥的判断标准只有一个:这种格式的内容能不能被干净地抽成文字。凡是要长期入库的,能转 txt / md 就转。

限制逐条:

什么格式最保险:一句话——txt / md 最稳

把这句话记牢:纯文本(txt / md)是所有入口里唯一"不会出意外"的格式。它不需要任何解析器,直接读取,编码问题也有兜底。

docx / pdf 依赖解析链路,效果参差不齐:PDF 抽不到文字的扫描件一定失败;docx / xlsx 在知识库这条链路上走的是降级通道,正文基本抽不出来、抽到的多是二进制噪声。好在这类文档不会再被误标成「就绪」——系统会把它标成「需人工确认」并给出原因,等你复核,避免"看起来成功了、检索出来却是乱码"。所以遇到重要资料,"先转成 txt 再传"永远是最省钱、最省心的做法——写文档时多花两分钟,后面能少踩十个坑。

附录 C · 文档处理异常自查表

症状 → 可能原因 → 处置步骤。按顺序试,多数问题三步内解决。

症状 可能原因 处置步骤
文档一直是「待处理」 你还没点「处理」。这是最常见的情况,不是故障 ① 打开该知识库的「文档管理」抽屉;② 找到那一行,点操作列的 处理;③ 点「刷新」看状态是否开始变化
一直卡在「解析中」超过十几分钟 文件太大、格式复杂,或者文件本身已损坏 ① 再等 5 分钟,点「刷新」;② 仍不动,把原文另存为 txt(只保留正文)重新上传;③ 如果是扫描版 PDF,先 OCR 转文字
卡在「向量化中」很久 向量模型调用慢或批量大。这一步本来就最耗时 ① 先等(大文档几分钟到十几分钟正常);② 若超过半小时,刷新看是否已转「失败」;③ 失败且提示与"未配置"有关,说明向量模型没配好,需管理员处理;④ 拆分文档后分批传
状态是「失败」,提示内容为空 正文抽出来是空的——扫描件、纯图片 PDF、加密文档最常见的结局 ① 用 OCR 工具把文件转成文字;② 存成 txt 重新上传;③ 临时应急:把关键段落复制到「AI 对话」里直接问
状态是「需人工确认」 解析走了降级路径——docx / xlsx 抽不出结构,或正文乱码占比偏高(≥5%)。这是新版本刻意新增的"存疑"状态,不是彻底失败 ① 点开这一行的错误说明,看系统写明的具体原因;② 内容还能用 → 直接点 处理 放行入库;③ 内容确实乱七八糟 → 把它另存为 txt / md 重传(推荐);④ 别不管它,它不会自动进检索
状态是「失败」,文件后缀明明是 PDF 文件不是真正的 PDF(被改过后缀),或 PDF 结构损坏。PDF 的魔数校验在解析期做,所以伪装文件能传上来、但会在这一步失败落库 ① 用 PDF 阅读器打开试试,打不开就是坏文件;② 用原始文件重新导出一次 PDF;③ 仍不行就转 txt
上传直接失败,提示超限 文件超过 50MB ① 拆分文件;② 或者只提炼其中的要点段落,另存成 txt 再传(推荐);③ 别为了提高上限去改配置,大文件入库对检索没有好处
上传被当场拒绝(提示「不支持的文件类型 .xxx」「文件缺少扩展名」或「缺少 OOXML/ZIP 魔数」) 撞上了上传格式闸门:后缀不在白名单、文件没有扩展名,或者 docx / xlsx 并不是真正的 Office 文件(被改过后缀) ① 确认后缀:只支持 pdf / txt / md / markdown / docx / xlsx;② 无后缀的文件补上正确后缀;③ 若是 Word/Excel,拿原始文件重新导出一次再传,别用手改后缀的文件
状态是「就绪」,但 RAG 搜不到 你搜的关键词在文档里确实不存在;或者搜的是另一个知识库的内容;或者文档属于公司级私密库、而你在项目上下文里搜 ① 换用文档里真实出现过的词再搜;② 在「知识库」页签确认这份文档在哪个库;③ 确认该库的「共享下级」是否开启;④ 用 AI 问答页(勾「知识库检索」)换个问法试
相似度都很低(比如都在 30% 以下) 文档内容与你的问法用词差异大,或文档本身内容太杂(比如塞了一份满是表格的 Excel) ① 改进文档:把核心结论写成白话段落;② 把大而杂的库拆成"产品/AI 客户/竞品"几个专题库;③ 换更贴近文档原文的措辞搜索
搜出来的是过期内容 旧版本文档还留在库里,和新版一起被检索到 ① 定位到旧文档,在「文档管理」里删掉;② 养成"更新资料时同步删旧版"的习惯;③ 每季度清理一次(第十章第④步)
边缘接入页「暂无上传文件」 客户端没连上,或 scan 未启用,或目录里没有白名单格式的文件 ① 看托盘状态是不是 Connectioned;② 检查配置里的监听目录与格式白名单;③ 往监听目录里放一个 .txt 测试;④ 还不行看第 19 章
会议记录一直是「失败」 文件解析失败、内容为空,或 AI 梳理这一步调用出错 ① 打开详情抽屉,看顶部红色提示里的具体原因;② 内容为空 → 换纯文本粘贴;③ 点「重新梳理」重试;④ 仍失败就把内容精简后重交
行动项没有「转自动运营任务」按钮 它的状态不是「待处理」——可能已经转过(显示"已转任务 X"),或已被标记完成 ① 看右侧标签:已转任务 说明已经转过了,去「任务管理」里找它;② 已完成 说明不需要再转
点「启动自动运营」被拦 执行策略还没确认。这是设计门槛,不是故障 ① 去项目内 AI 问答 → 引导建项;② 生成策略 → 修改 → 点 确认策略;③ 看到标签变成「策略已确认」后,再回自动运营点启动
完成建项提示"没有项目定义,建项被跳过" 项目档案里缺少最基本的项目信息 ① 回项目详情页,把项目描述、目标补齐;② 回引导建项,点「重新从项目档案载入」;③ 若仍读不到,直接在「对话补充」里把项目是什么讲清楚,再生成摘要与策略
一个通用原则

凡是"看起来卡住了"的局面,先做两件事:点「刷新」看最新状态;找到具体的提示原文。系统在这类页面上的提示都很具体(比如"内容为空"、"未配置"、"暂不支持音视频"),提示原文本身就是答案。切忌反复重传——多数时候问题不在传输环节。

附录 D · 知识库内容清单模板(可勾选)

新建知识库时对着这张清单勾,避免"上线后才发现少喂了什么"。按公司级 / 项目级分开列。

公司级知识库(全公司通用,建议打开「共享下级」)

项目级知识库(本项目专用,建议一个专题一个库)

一条经验:宁可少而精

知识库质量的瓶颈从来不是"量不够",而是"太杂"。一份 300 字写得清楚的公司简介,对回答质量的提升,往往大于十份没人整理过的旧 PPT。宁可先放 5 份精炼材料,好过一口气塞 50 份半成品文档。